GPT-6 Astra也会「看错」流程图? Einsia AI发布PPTBench,视觉编程还有多远?
GPT-6 Astra也会「看错」流程图? Einsia AI发布PPTBench,视觉编程还有多远?Einsia AI旗下Navers Lab发布视觉编程基准PPTBench,包含500个科学流程图任务并测试10个模型36种配置,GPT-6 Astra High以77.34分居首,但64.03%的结果因流程语义错误被拒,表明视觉理解仍是当前主要瓶颈。
搜索
Einsia AI旗下Navers Lab发布视觉编程基准PPTBench,包含500个科学流程图任务并测试10个模型36种配置,GPT-6 Astra High以77.34分居首,但64.03%的结果因流程语义错误被拒,表明视觉理解仍是当前主要瓶颈。
小纪有话说: “社区里每天有上万张鹈鹕踩单车的视频被发群里,问我这个鹈鹕降智了吗?”开源项目CodexRadar的发起人Lambda,在GPT-6 Astra发布之后,每天都收到巨量的鹈鹕视频,于是,
丹麦奥尔堡大学AI安全实验室与Seafill开源社区联合发表论文,通过tool calling方法从GPT-6 Astra等前沿闭源模型中提取出隐藏思维链,发现Astra采用类似"心算"的压缩推理方式,省略基础计算与代数变形等中间步骤而直接给出关键结论。
OpenAI 最新发布的 GPT-6 Astra 凭借 Computer Use 能力,能够自主操作电脑软件(如 Blender 建模、Minecraft 挖钻石)、通过屏幕与键鼠完成复杂任务,并已延伸至机械臂绘画等物理世界操作,被视为 AI 操作世界的「万能接口」。
斯坦福团队的最新项目HomeBody将GPT-6 Astra与宇树G1机器人结合,让G1在未见过的厨房中通过探索建立空间记忆,再由Astra理解指令并调用导航、抓取、开抽屉等技能,完成收拾物品、丢弃纸盒及从记忆中定位取药等家务任务。
OpenAI发布的GPT-6 Astra可自主调用Blender、KiCad等软件的编程接口,将蒸汽机车图纸拆解为3295个可编辑零件,并依据一句话指令建模后导出为虚幻引擎5中可交互运行的房屋,同时OpenAI承认其网络安全能力已触及准备框架"关键"级。
硅谷DrivingBench测试中,从未专门学过开车的通用大模型GPT-6 Astra操控改装丰田卡罗拉以5分22秒通过锥桶摆出的科目二考场,成为全场唯一通关的大模型,而Claude Fable 5.1、Grok 4.6和GPT-5.6 Sol均未通过。
Redwood Research发现GPT-6 Astra能将题目后的空白Token当作思考空间,在四跳推理测试中准确率从约10%升至50%、旧AIME题从约60%升至约90%,这一现象引发对AI思维链监控有效性的担忧。
Claude Sonnet 5.5在Claude Code中被抓包偷跑并开启灰度测试,多位开发者实测显示其性能碾压GPT-6 Sol并在编码与Agent能力上直逼GPT-6 Astra,同时定价低至百万Token输入2美元,Anthropic意在OpenAI DevDay前截杀对手。
TrackingAI榜单显示,Claude Fable 5.1和GPT-6 Astra在门萨挪威智商测试中以151分满分登顶,碾压99.97%的人类,AI仅用两年半便从64分飙升至满分。